OpenClaw 摄像头应用教程
开始前请先完成
使用前准备目录下的 [01-外设硬件配置]、[02-openclaw Ajetson-KEY配置]、[03-openclaw切换模型]、[04-AI语音交互配置]、[05-三种对话方案配置测试]。本文默认基础环境已经准备完成,只展开摄像头相关内容。
1. 教程目标
本文通过 CSI 摄像头外设展示 OpenClaw 的自然语言控制能力。完成本教程后,读者可以:
-
了解 OpenClaw 使用摄像头进行拍照和视觉分析的基本思路
-
通过飞书、TUI、语音代码三种方式和 OpenClaw 对话
-
完成四个摄像头案例:拍照留档、场景描述、OCR 识别、目标定位与人脸检测
-
理解从“用户提出视觉任务”到“图片采集”和“结果返回”的完整链路
2. 硬件准备
-
OpenClaw 主控板
-
CSI 摄像头模块
-
摄像头排线
-
[可选] 麦克风模块 -
接线图

3. 软件准备
国内版本:
如果使用的是飞书,要将图片直接上传到飞书,要将你新建的飞书对话ID,填入下面路径的chat_id
/home/jetson/.openclaw/openclaw.json
- 打开飞书对话框,点击右上角的三个点

- 点击了之后拉到最下面,可以看到会话ID,点击复制

- 在配置文件里将"chat_id": 改成你自己的会话ID

改完之后,"appSecret": "nTAnX30VPsRlrBgPA95YthpYxafgLx35", 这里面的内容可以到这个路径下复制过来,
xxxxxxxxxx /home/jetson/.openclaw/credentials/lark.secrets.json

- 终端输入下面指令生效
xxxxxxxxxx openclaw gateway restart
国际版本:
如果使用的是WHATSAPP,要将图片直接上传到whatsapp,要将你新建的whatsapp对话ID,填入下面路径的"allowFrom"
- 打开你新建的whatsapp对话就能看到对话ID

- 将这个填入"allowFrom":

- 终端输入下面指令生效
xxxxxxxxxx openclaw gateway restart
4. 测试摄像头应用
开始当前教程前,请先完成一次 openclaw tui 基础对话自检;如果还没做,先看 [05-三种对话方案配置测试]。另外请确认视觉模型已经配置完成,可参考 [02-openclaw Ajetson-KEY配置] 和 [03-openclaw切换模型]。通过后,再进入摄像头专项测试。
终端输入以下命令进入 TUI:
xxxxxxxxxx openclaw tui

终端可以尝试输入下面内容:
-
帮我拍一张照片
-
识别一下这张图里的文字

- 找一下画面里的杯子(因为模型会联系上下文,要提醒它重新拍摄,不然它可能会采用第一张照片)

- 重新拍一张照片,把里面的文字整理成表格

5. 和 OpenClaw 对话的三种方案
| 方案 | 适合场景 | 优点 | 建议定位 |
|---|---|---|---|
| 飞书 | 远程控制、课堂演示 | 接入方便,适合多人体验 | 展示“远程自然语言控制” |
| TUI | 本地调试、命令验证 | 最直接、最容易排错 | 先跑通视觉链路 |
| 语音代码 | 语音交互、完整 AI 体验 | 最贴近真实对话体验 | 作为最终演示方案 |
如果选配了AI语音模块+扬声器,飞书对话、tui、whatsapp对话需要播报openclaw回复的内容,可以终端运行下面的程序,ai语音模块对话不需要重复运行
- 修改是否打开播报参数
xxxxxxxxxx /home/jetson/voice_to_openclaw/.env xxxxxxxxxx ENABLE_TTS = true #这个参数就是控制是否播报,修改完保存,终端运行下面程序
- 终端输入
xxxxxxxxxx cd ~/ voice_to_openclaw source . venv / bin / activate python \- m src . openclaw_session_tts

5.1 飞书方案
飞书接入步骤请直接参考 [05-三种对话方案配置测试],本节只保留适合摄像头教程的对话示例。
打开飞书后,通常也能看到前面用 openclaw tui 触发的照片和识别结果同步过来。

可以重新直接对话,例如:
-
看一下前面是什么
-
识别一下图片里的文字

5.2 TUI 方案
如果已经完成第 0 篇中的 TUI 自检,直接在终端输入下面命令即可继续对话:
xxxxxxxxxx openclaw tui
然后就可以直接输入摄像头相关指令,例如:
-
拍一张当前画面
-
描述一下镜头里的场景
-
检测一下有没有人脸
这里可以自行添加 TUI 对话截图。
5.3 语音代码方案
xxxxxxxxxx 需要选配 ai 语音交互模块 + 扬声器
语音模块安装、环境配置和基础唤醒流程请直接参考 [04-AI语音交互配置]。唤醒之后,可以直接说出控制内容,例如:
-
帮我拍一张照片
-
看一下前面有什么
-
帮我读一下画面里的文字
这里可以自行添加语音唤醒和语音控制截图。
6. 综合案例
注意:下面都是在 openclaw tui 方式进行对话演示,你也可以自己选择飞书或语音方式来完成。
6.1 案例一:拍照留档
实验目标
让 OpenClaw 先完成最基础的拍照功能,并把图片保存下来。
效果说明
执行后会在本地生成一张照片,通常同时保留本次拍照文件和 latest.jpg 最近一次照片别名。这个案例适合用来验证采图链路。
示例指令
-
帮我拍一张照片
-
拍下当前画面
-
现在拍一张留作记录
6.2 案例二:场景描述
实验目标
让 OpenClaw 在拍照之后,对当前画面进行简短描述。
效果说明
OpenClaw 可以先完成拍照,再调用视觉分析脚本对图片内容做一句话描述,比如识别桌面、人物、食物或常见物体。
示例指令
-
看看前面有什么
-
帮我描述一下当前画面
-
拍照后告诉我镜头里主要是什么
6.3 案例三:OCR 表格识别
实验目标
让 OpenClaw 识别图片中的文字整理成表格。
效果说明
这个案例适合拍摄标签、卡片、包装或简单文档,然后把文字提取出来。既可以输出普通文本,也可以继续整理成表格。
示例指令
-
识别这张图里的文字
-
拍照后把文字整理成表格
-
找一下画面里的杯子
-
看看有没有人脸
-
帮我定位桌面右边的手机